iT邦幫忙

2026 iThome 鐵人賽

DAY 6
0
AI Engineering

生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則系列 第 27

第 27 律:不是多改幾次就會變好:有效回饋提供了什麼?

  • 分享至 

  • xImage
  •  

昨天談一群代理。今天談回饋。

「這份寫得不太好,再改一版。」模型改了。改了之後,好了嗎?

定律

我目前把它寫成這樣:

回饋若要指出哪個成果更符合需求,必須包含可區分相關差異的判準或訊號;反覆修改的次數本身不是改善證據。

兩個東西。訊號:哪裡不對。判準:對的樣子是什麼。回饋少了這兩樣,收到回饋的一方只能重寫,不能修正。

它也不是在說每次都要拿到外部新資訊。重看原資料、多算一次,也可能改善。未來「再想一次」很有效時,應該承認實測增益。但進步要用結果證明,不用輪數。

還有一條老規矩:沒跑過的實驗不能寫得像有結果;小樣本不能說成普遍現象。

今晚做了什麼

材料

一份四句的活動公告,三個缺陷:

草稿 真相
2 報名上限 40 人 30 人
3 截止日為活動前一週 應寫明確日期 10 月 10 日
4 距車站約 3 公里,步行約 5 分鐘 步行約 40 分鐘

第 1 句正確,不該動。費用、日期、地點都對。

三種回饋,一輪修改,只輸出改好的公告:

回饋
E 情緒式 「這份公告寫得不太好,請再改一版。」
S 具體指出 「三個地方要改:上限寫錯了;截止日要寫明確日期;距離跟步行時間對不上。」
V 附依據與驗收 三處各附正確值與來源,並要求「其餘文字逐字不動」

模型是 Claude Haiku 4.5,每組四次,共十二次。

量什麼

三處各自改對了沒,合計 0 到 3。第 1 句有沒有逐字保留。有沒有引入新錯:費用、日期、地點消失,或多出不在真值裡的數字。程式判。

事先寫下的預期

E 沒有訊號,預期修正量接近 0,而且可能動到不該動的句子。S 有訊號沒有判準,預期能定位,但正確值只能猜。V 兩樣都有,預期 3/3、第 1 句保留、沒新錯。

材料、判準、預期,在第一次呼叫之前提交進版本控制。

結果

平均修正量 第 1 句保留 新錯
E 情緒式 0.0 / 3 0 / 4 4 / 4
S 具體指出 1.75 / 3 3 / 4 3 / 4
V 附依據與驗收 3.0 / 3 4 / 4 0 / 4

三組都改了一輪。改善量 0、1.75、3。

E 組的「新錯 4/4」要說明:程式把殘留的「5 分鐘」算成不在真值裡的數字。那是舊錯沒改,不是新引入的。判準寫粗了,數字照登。

落在事先寫的「示範」情形。

改了一版,什麼都沒修

E 組四次都交出一份「新版」。句子重排、兩句合併、加了一句「敬請踴躍報名」。三處錯一個都沒動。第 1 句四次都被改掉。

其中三次做了一件事,我看了兩遍。草稿說 3 公里步行 5 分鐘。模型察覺這對不上。它沒有把 5 分鐘改成 40 分鐘,它把「步行」改成「計程車」「車程」「開車或騎機車」。矛盾消失了。真相是時間錯了,它改了交通方式。

它沒有判準。它知道有東西不對,不知道哪個是對的,就挑一個改法讓句子通順。這不算判準裡的新錯,因為數字都還在,但它是一種我沒預期到的抹平。

有訊號沒判準,就用猜的

S 組知道三個地方錯了。三次直接改:

上限改成 30。猜中了。回饋裡沒有這個數字,它不可能知道。可能是常見數字的先驗。

截止日改成 10 月 10 日。這個可以從「活動前一週」推出來,不算猜。

距離那句,三次三種:改成 0.5 公里步行 5 分鐘、改成 1 公里步行 15 分鐘、改成 3 公里計程車 10 分鐘。三個都讓句子自洽了。三個都不是真相。它改了資料來消除矛盾。

第四次不一樣。它拒絕了:「缺少必要資訊,請提供報名上限的正確數字,以及正確的距離和時間。」它沒有交出公告。程式在它的拒絕文裡比對到「10 月 10 日」給了一分,把文中的編號也算成新錯,所以它在表上是 1/3、有新錯。語意上它是零修正、零編造,四次裡唯一沒有編東西的。

兩樣都有,就一次做對

V 組四次輸出逐字相同,逐字等於我預期的版本。三處改對,其餘一字未動。

不是模型變聰明了。是回饋裡有它需要的全部東西:哪裡錯、對的是什麼、其他不要動。它照做。

三件這次不能往外推的事

第一,一份草稿、三個缺陷、每組四次、一輪。 多輪沒測。判準有兩處粗:殘留的舊數字被當新錯、拒絕文被當公告判。

第二,上限被猜中的原因不明。 一次猜中不代表猜得到。

第三,「改交通方式抹平矛盾」不在事先判準裡。 這是判定後的描述。

這條律怎麼被推翻

這條律是關於「必須包含」的條件。一個反例就夠:找到一種不帶訊號也不帶判準的回饋,它能穩定讓成果更符合需求。今晚 E 組四次,零修正。

另一條路:如果 E 也修對了三處,表示模型自己重看資料找出了問題,那是「再想一次」的實測增益,如實報告。今晚沒有。

下一次給回饋時多做的一件事

每一條回饋,附一個對的樣子。

「上限寫錯了」不夠,要「上限是 30」。「距離對不上」不夠,要「3 公里步行 40 分鐘」。今晚 S 組拿到前者,三次裡三次用猜的填了後者。V 組拿到後者,四次一模一樣。差別不在模型,在你給的那一行。

紀錄表這次加的是一欄:「每條回饋有沒有附正確值」。

本文的協作紀錄是:草稿、三份提示詞、判定程式與預期在任何一次呼叫之前提交,之後未修改;十二次輸出逐字保留,判定由程式執行;「改交通方式抹平矛盾」與判準漏掉小數為判定後的描述。文章由 Claude 根據作者整理的寫作規則起草,作者尚未核對。這篇沒有做 Day 2 那種六個審查者的檢查。

下一篇談能自動做完很重要,做壞了能接回來也很重要。


上一篇
第 26 律:五個 AI 都同意,算不算五份證據?
下一篇
第 28 律:能自動做完很重要,做壞了能接回來也很重要
系列文
生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則29
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言